融合算子：Hardswish-Affine-Gate（一次核内完成仿射与 Hardswish 风格门控，返回 y = x * clamp(α*z + β + 3, 0, 6) / 6，其中 z = x*scale + bias）。该门控具备近似线性区域与饱和特性，适合稳健的逐维缩放。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`g = clamp(alpha*z + beta + 3, 0, 6) / 6`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：PyTorch 参考 `Model`；统一输入与初始化接口
- `cudacode.py`：单核融合（仿射+clamp 线段门控+乘法）；编译 `-O3 --use_fast_math`
- `run_code.py`：迭代 100 次；精度 `rtol=1e-03, atol=1e-06`；打印加速比

CUDA 实现要点
- 并行布局：`grid = B`；块内沿 D 连续访存并一次写回
- 对齐向量化：满足 16 字节对齐且 `D%4==0` 时走 `float4`；否则标量路径
- 指令优化：仿射用 `fmaf`；clamp 分支尽量保持分支收敛；循环 `#pragma unroll 4`
- 线程配置：参考 `block=1024`，按设备与规模微调至 `256/512/1024`

评估与目标
- 精度：参考与 CUDA 在 `rtol=1e-03, atol=1e-06` 内一致
- 性能：≥1.0x 加速；在对齐触发向量化时更佳

加分项（可选）
- 将 clamp 写成逐元素最小/最大组合减少分支（`fminf/fmaxf`）
- 优化尾部处理与非对齐路径的开销

